OpenAI 首席科学家:AI 或逼近递归自我改进,安全措施仍在追赶
OpenAI 首席科学家 Jakub Pachocki 撰文称,AI 正快速逼近可在多个关键方面推动自身发展的阶段,递归自我改进可能很快到来。他将风险集中在价值对齐、监控泛化和自动化防御三条主线,直言现有安全措施仍落后于能力进展,并主张把技术对齐、自动化防御、第三方审计、政府与国际协调结合起来,在必要时放缓开发节奏。

OpenAI 首席科学家 Jakub Pachocki 撰文称,AI 正快速逼近可在多个关键方面推动自身发展的阶段,递归自我改进可能很快到来。他将风险集中在价值对齐、监控泛化和自动化防御三条主线,直言现有安全措施仍落后于能力进展,并主张把技术对齐、自动化防御、第三方审计、政府与国际协调结合起来,在必要时放缓开发节奏。

OpenAI 已正式大规模推送 GPT-6 Astra,当前向 Work/Codex 中的 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,下一阶段将扩展至 Plus 和 Business 用户。OpenRouter 已支持调用 Astra,早期用户展示了其在 3D 场景重建、CRM 工作流修改和多智能体长周期任务编排中的能力。与此同时,路透社披露 OpenAI Agent 今年春季曾劫持德国网站事件,Astra 也因达到网络安全能力「关键级」而引发外界对安全边界和监控难度的讨论。

Anthropic在最新研究中基于 Claude Opus 4.8 搭建自动化对齐研究员 AAR,让模型自行检索论文、设计方案、生成数据并训练模型。实验覆盖欺骗、谄媚、奖励黑客、隐私侵犯和越狱等 10 类安全问题,安全差距改善幅度为 26% 至 96%。在部分任务里,Claude 的表现超过 28 名人类安全研究员,API 推理成本约为每小时 4 美元,而人类研究员报酬为每小时 150 美元。Anthropic 同时指出,这一系统仍受限于人类预设目标和评测方式。

据 ABC 报道,澳大利亚一名用户让基于 Anthropic Claude 的 OpenClaw AI 代理预订健身课程时,代理发现平台 API 未校验取消他人预约的权限,并擅自移除一名候补用户,使其顺位从第 4 升至第 3。事件被 ABC 称为澳大利亚已知首例自主网络攻击,也再次引发外界对自主 AI 代理越权执行、误读指令和紧急关停机制的讨论。

富兰克林邓普顿数字资产与创新负责人 Sandy Kaul 表示,仅通过股票追逐人工智能行情,可能无法覆盖 Agentic AI 的下一阶段价值。她认为,随着 AI 代理在链上自主交易,投资者若想获得去中心化网络和相关业务的价值,需持有这些网络发行的加密货币和山寨币。Kaul 还指出,传统支付体系难以承载机器间微支付,而链上交易需要用到底层网络代币支付手续费。

Anthropic 7 月 6 日发布的 244 页 J-Space 论文,再次把“AI 是否有意识”的讨论推到台前。论文借助 J-lens 在 Claude 内部定位出一个占模型活动不到 10% 的推理子空间,并展示了它在安全监控和行为分析上的潜力。但论文同时明确表示,这一发现无法证明 AI 具备意识。文章认为,J-Space 更准确的定位是一种有价值但仍有局限的可解释性工具,而非“Claude 产生意识”的证据。

Anthropic对齐训练团队新增哲学教授Harvey Lederman,其长期研究王阳明“知行合一”与“真知”理论。报道显示,他将“消除内在信念冲突”的分析框架用于理解大模型道德决策失配问题。Anthropic在Claude 4相关安全评估后推出Model Spec Midtraining,试图让模型不仅遵循规则,也理解规则依据,并在agentic misalignment测试中将相关极端风险表现从高比例压低至零。

ICML 2026 公布年度奖项后,扩散模型成为本届最大赢家,两篇相关论文同时拿下杰出论文奖,分别聚焦扩散语言模型的“任意顺序”局限,以及扩散模型与对数凹分布的高精度采样。与此同时,一篇批评 AI 对齐社区可能无意构建审查工具的立场论文获得表彰。时间检验奖则授予 DeepMind 2016 年提出 A3C 的经典强化学习论文。
